Índice · Visión Computacional

Visión Computacional

Clase 4 · Principios de Visión Computacional y su Aplicación en Neurociencia

Fecha: 22 de agosto de 2026

Resumen de la clase

1 Contenido de la clase

Normalización de imágenes y canales espectrales [00:00-02:20]

Cuando se juntan distintas fuentes de información (datos con diferente rango dinámico) hay que normalizar para que todo quede en el mismo rango [00:45-01:05]. Las imágenes pueden tener muchos canales; el caso típico son 4 canales: rojo, verde, azul y pancromático. El pancromático es una imagen de intensidad que junta los tres canales de color [01:12-01:40]. El canal verde es importante por una razón física (relacionada con la sensibilidad de los sensores) [02:00-02:20].

Visión computacional y neurociencia: lentes de Meta [03:05-05:25]

Una alumna presenta una aplicación con lentes de Meta (realidad aumentada) para estimar degeneración cerebral y detectar enfermedades degenerativas [03:05-03:20]. Los lentes tienen sensores multiseñal: audio, video, imágenes y sensores de movimiento [03:25-03:40]. Se recolectan datos de la vida cotidiana (cocinar, comer, movimientos) para correlacionar patrones de comportamiento con la degeneración cerebral [04:30-05:00]. Los datos de Meta son open source (dataset egocéntrico) [07:01-07:12].

Vision Transformers y modelos multimodales [03:40-04:30, 05:00-05:25]

Un Vision Transformer (ViT) adapta el transformer de texto a las imágenes: usa módulos de self-attention para recordar patrones o pedacitos de la imagen, de forma similar a como el transformer recuerda secuencias de texto [03:40-04:05]. No usa la red neuronal convolucional clásica [04:10-04:20]. Los modelos multimodales (como ImageBind de Meta) transforman señales de texto, video, audio e imagen a un espacio vectorial (embeddings), lo que permite que un transformer de texto interprete contenido visual [05:00-05:25].

fMRI, reconstrucción de percepción y biomarcadores digitales [05:25-06:43]

Con fMRI se busca reconstruir lo que la persona está viendo a partir de la actividad cerebral: se mapea la actividad, se transforma la imagen cerebral a embeddings y un modelo de IA generativa de imagen usa esos embeddings para reconstruir la percepción visual [05:25-06:00]. Los biomarcadores digitales son un concepto muy nuevo: métodos menos invasivos (pulsera, microchip) para obtener información cerebral, correlacionando patrones de movimiento diarios con señales cerebrales [06:10-06:43].

Campos receptivos y control de ganancia local [08:55-22:02]

En la retina, los sensores que caen dentro de un área (campo receptivo) se agrupan y la información sale por un nervio [08:55-09:30]. La contribución de cada sensor sigue un perfil gaussiano (el centro pesa más) [10:05-10:20]. Las células bipolares agrupan muestras con perfil gaussiano y las células horizontales realizan un control de ganancia local [11:10-11:40]. En la periferia no se resuelven detalles (solo se "ven cosas"); en el centro de la visión hay alta resolución [12:00-12:30]. La correlación es una función matemática que se correlaciona con un estímulo parecido: el resultado es máximo cuando se parecen [13:15-14:00]. Ejemplo: con fondo brillante, las personas salen oscuras en la foto porque la cámara ajusta a la luminancia promedio, mientras que el ojo tiene control de ganancia local (cada zona ajusta distinto) [15:30-16:30].

Retina, fóvea, bastones y conos [22:13-25:00]

La densidad de sensores en la retina es de ~135-145 mil por milímetro cuadrado (bastones y conos) [22:13-22:30]. El punto ciego es por donde salen los nervios [22:40-22:50]. Los bastones (unos 100 millones) están sobre todo en la periferia, funcionan con poca luz y no dan color [23:00-23:30]. Los conos se concentran en el centro de la visión (fóvea), son pocos, necesitan mucha luz y dan color [23:30-23:50]. La visión escotópica (bastones, poca luz, sin color) contrasta con la visión en color; la periferia es sin color porque solo hay bastones [23:50-24:10]. Experimentos: en un cuarto oscuro, un punto iluminado se ve en la periferia, no en el centro; al mover la vista aparece [24:20-24:40]. En el experimento del punto amarillo, fijando la vista en distintos números de una foto, el punto amarillo nunca se ve directo (solo en periferia) [24:40-25:00].

Estereopsis: profundidad por disparidad binocular [27:22-29:01]

Con dos ojos (o dos cámaras) separados, los objetos cercanos cambian más de posición que los lejanos; la disparidad es proporcional a la proximidad del objeto [27:22-28:00]. El camino del ojo a la corteza cruza nervios en el quiasma óptico, donde se calcula la disparidad [28:10-28:30]. Las etapas profundas del procesamiento visual aún no se entienden por completo; se pasa de estructuras básicas (detección de líneas) a tareas complejas en la corteza [28:40-29:01].

El sistema visual como caja negra: respuesta a impulso [29:07-44:15]

El sistema visual se puede ver como una caja negra: entrada = estímulo, salida = percepción [29:07-29:30]. Se considera el perfil de luminancia de una línea (negro, blanco, transición). La respuesta a impulso es la función que permite conocer la calidad del sistema a partir de la entrada [30:00-30:40]. La operación consiste en multiplicar la función de respuesta por el estímulo e integrar: es una correlación/convolución, y el sistema es lineal; el kernel se desliza una posición a la vez [31:10-32:00]. Este modelo explica fenómenos de contraste: en un borde, el lado oscuro se ve más oscuro y el lado brillante más brillante (bandas de Mach) [33:00-34:00].

Respuesta en frecuencia y MTF [44:45-47:23]

La transformada de la respuesta a impulso es la función de transferencia (transformada de Fourier → frecuencias) [45:25-45:50]. Como al comprar un reproductor de audio se pregunta su respuesta en frecuencia, en visión se estudia cómo percibimos según la frecuencia espacial [46:00-46:30]. Ningún sistema real es plano (impulso ideal); todas las respuestas caen con la frecuencia [46:40-47:00]. La MTF (Modulation Transfer Function) —en óptica, funciones de sensibilidad— describe cómo percibimos cada frecuencia [47:10-47:23].

Función de sensibilidad al contraste y práctica [47:35-60:28]

Se muestra un esquema con renglones de distintas frecuencias espaciales (barras sinusoidales): la percepción del contraste decae con la frecuencia [47:35-48:00]. La MTF del ojo explica qué frecuencias se perciben; la frecuencia máxima de la curva es de ~2-3 ciclos por grado (no ciclos por segundo) [48:10-49:00]. En la clase siguiente se detalla una práctica para medir la curva de sensibilidad al contraste usando los renglones/discos de frecuencias [60:00-60:28].

2 Puntos destacados / Lo que hay que saber

Al integrar distintas fuentes de datos hay que normalizar para que todo esté en el mismo rango [00:45-01:05].
Imagen de 4 canales: rojo, verde, azul y pancromático (intensidad que junta los tres canales) [01:12-01:40].
Los Vision Transformers usan self-attention en imágenes (como el transformer en texto); no usan la CNN clásica [03:40-04:20].
Los modelos multimodales llevan texto, video, audio e imagen a un espacio vectorial (embeddings) [05:00-05:25].
Aplicación de neurociencia: lentes de Meta para estimar degeneración cerebral; los datos son open source [03:05-03:20, 07:01-07:12].
Con fMRI se reconstruye lo que se ve transformando la actividad cerebral a embeddings para una IA generativa [05:25-06:00].
Biomarcadores digitales: métodos menos invasivos que correlacionan patrones de movimiento con señales cerebrales [06:10-06:43].
Campos receptivos: los sensores de un área se agrupan y salen por un nervio; contribución con perfil gaussiano; células horizontales = control de ganancia local [08:55-11:40].
Bastones: periferia, poca luz, sin color (visión escotópica). Conos: fóvea, mucha luz, color [23:00-24:10].
Estereopsis: la disparidad entre dos ojos es proporcional a la cercanía del objeto; se calcula en el quiasma óptico [27:22-28:30].
Respuesta a impulso: multiplicar la función de respuesta por el estímulo e integrar = correlación/convolución; explica las bandas de Mach [30:00-34:00].
La MTF / función de transferencia describe la percepción según la frecuencia espacial [45:25-47:23].
La frecuencia máxima de la curva de sensibilidad al contraste es de ~2-3 ciclos por grado [48:10-49:00].

3 Actividades y tareas pendientes

En esta clase no se dejó una tarea con fecha de entrega, pero se adelantó la práctica de la clase siguiente: medir la curva de sensibilidad al contraste usando los renglones/discos de frecuencias (frecuencia máxima ~2-3 ciclos por grado) [60:00-60:28]. Conviene:

4 Dudas que podrían examinar

¿Por qué hay que normalizar las imágenes?

Al juntar fuentes con distinto rango dinámico hay que llevarlas al mismo rango para poder procesarlas juntas [00:45-01:05].

¿Qué diferencia hay entre un Vision Transformer y una CNN?

El ViT adapta el transformer de texto a imágenes con self-attention, sin usar la red convolucional clásica [03:40-04:20].

¿Qué son los biomarcadores digitales?

Métodos menos invasivos (pulsera, microchip) que correlacionan patrones de movimiento diarios con señales cerebrales [06:10-06:43].

¿Por qué la visión periférica es mejor con poca luz?

Porque en la periferia hay bastones (poca luz, sin color); los conos están en el centro y necesitan mucha luz [23:00-24:10].

¿Cómo se calcula la profundidad con dos ojos?

Por disparidad binocular: los objetos cercanos cambian más de posición; el cálculo ocurre en el quiasma óptico [27:22-28:30].

¿Qué es la respuesta a impulso?

Es la función que describe la calidad del sistema a partir de un estímulo; se multiplica por el estímulo y se integra (correlación/convolución) [30:00-32:00].

¿Qué mide la MTF?

La respuesta en frecuencia del sistema (función de transferencia); en visión describe cómo percibimos según la frecuencia espacial [45:25-47:23].

¿Cuál es la frecuencia máxima que percibe el ojo?

La curva de sensibilidad al contraste cae hasta ~2-3 ciclos por grado [48:10-49:00].

5 Sitios o recursos para visitar

ImageBind (Meta)
Modelo multimodal que une audio, texto, imagen y video en un espacio vectorial. · es.wikipedia.org
Vision Transformers
Self-attention aplicado a imágenes (alternativa a las CNN). · google.com
Campo receptivo
Área de la retina cuyos sensores se agrupan y salen por un nervio. · es.wikipedia.org
Célula bipolar
Neurona de la retina que agrupa muestras con perfil gaussiano. · es.wikipedia.org
Célula horizontal
Célula de la retina responsable del control de ganancia local. · es.wikipedia.org
Bastones
Fotorreceptores de la periferia, visión escotópica (poca luz, sin color). · es.wikipedia.org
Conos
Fotorreceptores de la fóvea que dan visión en color. · es.wikipedia.org
Fóvea
Centro de la retina con máxima densidad de conos y alta resolución. · es.wikipedia.org
Estereopsis
Percepción de profundidad por disparidad binocular. · es.wikipedia.org
MTF (Modulation Transfer Function)
Respuesta en frecuencia de un sistema óptico. · es.wikipedia.org
Sensibilidad al contraste
Curva que describe qué frecuencias espaciales percibe el ojo. · google.com
Bandas de Mach
Ilusiones de contraste en los bordes (lado oscuro más oscuro, brillante más brillante). · es.wikipedia.org

6 Glosario de términos

  • Normalización: ajustar datos de distinto rango dinámico a un mismo rango.
  • Canal pancromático: imagen de intensidad que junta los canales de color (rojo, verde, azul).
  • Vision Transformer (ViT): arquitectura que aplica self-attention a las imágenes, adaptando el transformer de texto.
  • Modelo multimodal: modelo que transforma distintas señales (texto, video, audio, imagen) a un espacio vectorial común (embeddings).
  • Embedding: representación vectorial de una señal en un espacio continuo.
  • Biomarcador digital: método no invasivo (pulsera, microchip) que correlaciona patrones de comportamiento con señales cerebrales.
  • Campo receptivo: área de la retina cuyos sensores se agrupan y contribuyen a una misma célula.
  • Célula bipolar: neurona de la retina que agrupa muestras de los fotorreceptores con perfil gaussiano.
  • Célula horizontal: neurona de la retina que realiza control de ganancia local.
  • Perfil gaussiano: ponderación donde el centro pesa más que los bordes.
  • Correlación / convolución: operación de multiplicar la función de respuesta por el estímulo e integrar.
  • Punto ciego: zona de la retina por donde salen los nervios y no hay fotorreceptores.
  • Bastón: fotorreceptor de la periferia, sensible a poca luz, sin color (visión escotópica).
  • Cono: fotorreceptor de la fóvea, necesita mucha luz, da color.
  • Fóvea: centro de la retina con máxima densidad de conos y alta resolución.
  • Estereopsis: percepción de profundidad por disparidad binocular.
  • Disparidad: diferencia de posición de un objeto entre las dos retinas; es proporcional a la cercanía.
  • Respuesta a impulso: función que describe la salida del sistema ante un estímulo puntual.
  • Función de transferencia: transformada (Fourier) de la respuesta a impulso; describe la respuesta en frecuencia.
  • MTF (Modulation Transfer Function): medida de la respuesta en frecuencia de un sistema óptico.
  • Frecuencia espacial: variación del estímulo por unidad de ángulo (ciclos por grado).
  • Bandas de Mach: ilusiones de contraste en los bordes (el lado oscuro se ve más oscuro y el brillante más brillante).

7 Mapa mental textual

  • Principios de Visión Computacional y Neurociencia
    • Procesamiento de imágenes
      • Normalización de fuentes con distinto rango dinámico
      • Canales: rojo, verde, azul, pancromático (intensidad)
    • IA moderna y neurociencia
      • Vision Transformers (self-attention, sin CNN)
      • Modelos multimodales → embeddings (ImageBind)
      • Lentes de Meta: degeneración cerebral (datos open source)
      • fMRI → reconstrucción de percepción con IA generativa
      • Biomarcadores digitales (pulsera, microchip)
    • El sistema visual humano
      • Retina y fóvea
        • Campos receptivos con perfil gaussiano; células bipolares y horizontales (ganancia local)
        • Bastones (periferia, poca luz, sin color) vs conos (fóvea, mucha luz, color)
        • Punto ciego; experimentos de percepción periférica
      • Estereopsis: disparidad binocular → profundidad (quiasma óptico)
      • Sistema como caja negra
        • Respuesta a impulso → correlación/convolución (bandas de Mach)
        • Función de transferencia (Fourier) → MTF
        • Sensibilidad al contraste: frecuencia máxima ~2-3 ciclos por grado
    • Práctica próxima: medir la curva de sensibilidad al contraste [60:00-60:28]

Notas de estudio